专业智能显示方案提供商
OEM产品
OEM产品
行业定制
新闻资讯
+86 13923405632
AI 迷你主机部署本地大模型完整步骤 Ollama 实操教程
09-17 / 2026 5

买了一台 AI 迷你主机,想跑本地大模型,但打开教程一看——装驱动、配环境、下模型、调参数,每一步都有坑。有人卡在驱动安装,有人下完模型发现跑不动,有人跑起来了但不知道怎么让其他程序调用。

这不是你一个人的问题。本地部署大模型确实有门槛,但用对工具之后,整个过程可以压缩到 30 分钟以内

以 Ollama(目前最流行的本地大模型部署工具)为例,手把手教你从零到跑通,覆盖 环境准备、安装部署、模型运行、API 调用、性能调优 等流程。

一、部署前准备:你的 AI 迷你主机需要满足什么?

硬件检查清单

配置项最低要求推荐配置说明
内存16GB32GB7B 模型需 16GB,13B 需 32GB
存储50GB 可用256GB+ SSD每个 7B 模型约 4.5GB
操作系统Windows 11 / Ubuntu 22.04Ubuntu 22.04 LTSLinux 下性能更好
网络仅首次下载模型需要宽带连接下载模型后完全离线可用

华一各型号部署建议

型号内存推荐模型预期速度
PB100116GB DDR4Qwen2.5-7B Q46~10 token/s
PB120216GB LPDDR5Qwen2.5-7B Q48~12 token/s
PB130116GB LPDDR5xQwen2.5-7B / 13B Q415~25 token/s
PB140116GB DDR4(RTX 3060)7B~13B FP1640~60 token/s
PB1501128GB LPDDR5x70B Q4可跑
PB06016GB LPDDR4Qwen2.5-7B INT88~12 token/s
PB08016GB LPDDR4Qwen2.5-7B INT88~12 token/s

二、Ollama 是什么?为什么选它?

Ollama = 本地大模型的“一键安装器”

它的核心价值:

  • 一条命令安装:不需要手动配 Python 环境、CUDA 驱动

  • 一条命令跑模型ollama run qwen2.5 即可开始对话

  • 自动模型管理:自动下载、版本管理、内存优化

  • 提供 API 接口:其他程序可通过 HTTP 调用本地模型

  • 支持多平台:Windows / macOS / Linux / ARM

一句话:Ollama 让本地跑大模型从“需要折腾一整天”变成“30 分钟搞定”。

三、安装 Ollama

Windows 系统

步骤 1:访问 Ollama 官网下载页

text

https://ollama.com/download/windows

步骤 2:双击安装包,一路“下一步”完成安装

步骤 3:安装完成后,打开 CMD 或 PowerShell,输入验证:

bash

ollama --version

显示版本号即安装成功。

Ubuntu / Linux 系统(x86 和 ARM 通用)

x86 系列安装

bash

curl -fsSL https://ollama.com/install.sh | sh

ARM 系列(PB0601/PB0801)安装

bash

# ARM 版 Ollama 安装
curl -fsSL https://ollama.com/install.sh | sh

验证安装

bash

ollama --version

四、下载并运行模型

选择适合你的模型

模型名称参数量文件大小中文能力适用场景
Qwen2.5-7B7B~4.5GB⭐⭐⭐⭐⭐中文对话、公文起草、摘要
Llama 3.1-8B8B~5GB⭐⭐⭐英文内容、代码生成
DeepSeek-V2-13B13B~7.5GB⭐⭐⭐⭐⭐复杂推理、数据分析
ChatGLM3-6B6B~3.5GB⭐⭐⭐⭐轻量中文对话
Qwen2.5-14B14B~8GB⭐⭐⭐⭐⭐高精度中文场景

新手推荐:从 Qwen2.5-7B 开始——中文能力强、文件大小适中、16GB 内存即可运行。

下载并运行模型

bash

# 下载并运行 Qwen2.5-7B(Q4 量化版本)
ollama run qwen2.5:7b-instruct-q4_K_M

首次运行会自动下载模型(约 4.5GB,视网速 5~30 分钟)。下载完成后自动进入对话界面。

验证部署成功

text

>>> 你好
你好!我是通义千问,有什么可以帮你的吗?

如果模型正常回复,说明部署成功。

常用 Ollama 命令

bash

# 查看已下载的模型列表
ollama list

# 运行指定模型
ollama run qwen2.5:7b-instruct-q4_K_M

# 删除不需要的模型(释放存储空间)
ollama rm qwen2.5:7b-instruct-q4_K_M

# 查看正在运行的模型
ollama ps

# 停止当前模型
/bye

五、验证离线运行能力

这是本地部署的核心价值——断网也能用

验证步骤

  1. 拔掉网线 / 关闭 Wi-Fi

  2. 重新运行模型:

    bash

    ollama run qwen2.5:7b-instruct-q4_K_M
  3. 输入问题,确认模型正常回复

  4. 全程无任何联网请求

通过验证 = 完全离线可用

六、进阶配置:API 调用与远程访问

测试 API 接口

Ollama 默认启动 API 服务(端口 11434),可直接调用:

bash

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:7b-instruct-q4_K_M",
  "prompt": "你好",
  "stream": false
}'

配置内网访问(让其他设备调用)

如果需要局域网内其他设备(如另一台电脑、手机)调用模型:

bash

# Linux 系统:修改服务配置
sudo systemctl stop ollama
sudo vim /etc/systemd/system/ollama.service

# 在 [Service] 下添加环境变量
Environment="OLLAMA_HOST=0.0.0.0:11434"

# 重载并重启
sudo systemctl daemon-reload
sudo systemctl start ollama

配置后,内网其他设备可通过 http://[设备IP]:11434 访问 API。

配置开机自启

bash

# Linux 系统
sudo systemctl enable ollama
sudo systemctl start ollama

# 验证状态
sudo systemctl status ollama

Windows 系统:

  1. 打开任务管理器(Ctrl+Shift+Esc)

  2. 点击“启动”选项卡

  3. 找到 Ollama,确保状态为“已启用”

七、性能调优:让模型跑得更快

调整 GPU 层数(x86 核显机型)

bash

# 将更多模型层分配到 GPU/NPU(PB1202/PB1301)
ollama run qwen2.5:7b --num-gpu 999

调整上下文长度

bash

# 增加上下文窗口(默认 2048,可调至 8192)
ollama run qwen2.5:7b --ctx-size 8192

查看性能数据

bash

# 查看推理速度(输出末尾显示 tokens/s)
ollama run qwen2.5:7b --verbose

各型号预期速度(7B Q4) :

型号预期速度说明
PB10016~10 token/sVega 8 核显
PB12028~12 token/sRadeon 660M 核显
PB130115~25 token/s50 TOPS NPU 加速
PB140140~60 token/sRTX 3060 CUDA 加速
PB0601/PB08018~12 token/s6 TOPS NPU 加速

八、常见问题排查

问题 1:模型下载太慢

解决:使用国内镜像源(如 modelscope),或手动下载模型文件后导入 Ollama。

问题 2:GPU 加速没有生效

排查

bash

# 查看当前运行模型是否使用 GPU
ollama ps

# AMD 显卡检查驱动
rocm-smi

问题 3:内存不足,模型加载失败

排查

bash

# 查看内存使用
free -h

# 16GB 内存跑 7B Q4 够用(约 4.5GB)
# 13B Q4 建议 32GB

解决:选择更小的量化版本(如 Q3),或升级内存(PB1001 支持双 SO-DIMM 扩展)。

问题 4:ARM 盒子(PB0601/PB0801)NPU 加速未生效

排查

bash

# 确认 NPU 驱动已加载
ls /dev/dri/

# 确认 RKNN 版本
rknpu2_version

如遇问题,联系华一精品技术支持获取离线驱动包。

九、常见问答 FAQ

Q1:Ollama 和 LM Studio 哪个更好用?

A:

  • Ollama:命令行操作,适合开发者和自动化脚本;模型库更丰富

  • LM Studio:图形界面,适合非技术用户;Windows 下对 AMD 显卡支持更友好

两者都支持华一精品全系列 AI 迷你主机。

Q2:部署后能离线使用吗?

A:可以。 模型下载完成后,Ollama 完全离线运行,不需要联网。这是本地部署相比云端 API 的核心优势。

Q3:7B 模型和 13B 模型差别大吗?

A:13B 模型在复杂推理、多步骤任务、代码生成上明显更准确。如果只是日常对话和文档摘要,7B 够用。如果涉及复杂分析,建议上 13B(需 32GB 内存)。

Q4:能同时跑两个模型吗?

A:可以,但需注意内存。16GB 内存同时跑两个 7B 模型会紧张,建议 32GB 以上。PB1501(128GB)可以同时跑多个模型。

Q5:怎么让其他程序调用本地模型?

A:Ollama 提供标准 REST API(端口 11434),任何支持 HTTP 请求的程序都可以调用。OpenClaw、LangChain、Dify 等框架均支持对接 Ollama。

现在联系华一,立即提升您的产品核心竞争力
友情链接:
技术前沿
关于我们
网站地图
全国咨询热线

手机: +86 13923405632

©2018 深圳华一精品科技有限公司 版权所有 粤ICP备20069397号